ChinaMM 2025 零样本语音转换 情感语音转换 特征解耦学习 端到端语音合成 自监督学习

基于分层解耦的无文本零样本语音情感迁移

甄怡宁1,2   王春玲1,2   杨昊田1,2   王少荣1,2*

1 北京林业大学 信息学院(人工智能学院)
2 国家林业草原林业智能信息处理工程技术研究中心

TL;DR提出TZET方法,通过分层特征解耦(HuBERT+Wav2vec2.0+对抗训练)和端到端VITS框架实现无文本零样本语音情感迁移,在情感准确度上较FreeVC提升10.4%

Abstract

TZET通过三路独立预训练模块(HuBERT语义编码器/说话人编码器/Wav2vec2.0情感单元)分别解耦语义、身份与情感特征,结合对抗训练约束正交性,利用梅尔谱图缩放和交叉注意力F0预测增强鲁棒性,最终基于端到端VITS框架融合四元特征实现高质量零样本情感语音转换。

Method

现有零样本语音转换研究忽视情感传递;转换模型与声码器独立训练导致合成语音失真;基于IN的方法过度消除副语言信息导致情感韵律损失;基于VQ的方法受限于码本离散性引发自然度退化。

构建内容-说话人-情感三元特征的联合解耦框架,通过对抗训练约束说话人与情感嵌入空间的正交性,基于端到端VITS框架将声学建模与波形生成统一优化,消除级联系统的特征分布偏差,实现无文本零样本情感迁移。

分层解耦

内容-说话人-情感三元特征解耦

基于HuBERT提取语义内容(第9层512维隐藏状态+K-Means量化),双向LSTM说话人编码器提取256维说话人嵌入,Wav2vec2.0+CondConv提取情感特征。通过情感对抗损失(L_Spk - lambda*L_Emo)约束正交性,确保三者独立建模。

F0预测

交叉注意力驱动的音高轮廓预测

利用交叉注意力机制构建情感驱动的动态基频预测网络,以语义内容特征为查询向量,说话人+情感特征为键值对,实现情感相关F0轮廓的自适应建模,增强零样本条件下的音高动态捕捉能力。

端到端VITS

无文本端到端语音合成框架

基于VITS框架构建四元特征(Z_C语义+Z_F音高+Z_E情感)融合通道,通过后验编码器+归一化流+解码器联合优化,避免传统级联系统的声学特征与声码器分布不一致问题,支持音频到音频的直接转换。

训练采用双任务协同:(1)语音重建任务(使用源情感嵌入)优化特征解耦与重组;(2)语音转换任务(使用目标情感嵌入)验证情感迁移。F0和情感来自目标音频,内容和说话人来自源语音。总损失包括重构损失、对抗损失(G/D)、说话人/情感对抗损失和F0损失。

HuBERT第9层隐藏状态经K-Means(K=100)量化为离散语义令牌。梅尔谱图缩放(SR)策略从U(0.85,1.15)采样缩放系数r,对Mel谱图频率轴压缩或拉伸,实现双重增益:(1)学习鲁棒深层语义特征降低说话人依赖;(2)缓解未知说话人场景下的语义丢失。

Wav2vec2.0情感提取单元通过逐层叠加融合多层隐藏状态,经1D卷积(kernel=5)+ReLU+全局平均池化+FC输出情感表征。CondConv机制基于情感标签动态生成卷积核参数,固定部分权重作为身份特征锚点,实现层次化特征分离。

Results

ESD (说话人已知+情感已知)
59.8%
Emo.Acc.
比FreeVC(49.4%)提升10.4% 情感准确率显著优于所有基线
ESD (说话人已知+情感已知)
99.4%
Spk.Acc.
比ZEST(98.9%)提升0.5% 说话人准确率最优
ESD (说话人已知+情感已知)
1.43%
CER
比ZEST(5.4%)降低3.97%,比FreeVC(1.53%)更优 字符错误率最低,语音清晰度最好
ESD (说话人未知+情感已知)
57.2%
Emo.Acc.
比FreeVC(46.8%)提升10.4% 零样本说话人场景下仍保持优势
MethodCER%F0-PCCSpk.Acc.%Emo.Acc.%
FreeVC1.530.77899.349.4
ZEST5.40.75498.959.0
TZET(w/o F0)2.49-99.253.3
TZET(w/o SR)3.20.76199.058.4
TZET ours1.430.77299.459.8

TZET在已知/未知说话人及情感场景下均展现优势:情感准确率较FreeVC提升10.4%,说话人准确率达99.4%(较ZEST提升0.5%),CER降至1.43%(较ZEST降低3.97%)。消融实验证实对抗损失对说话人/情感解耦贡献最大,F0预测模块增强情感表征完整性,SR数据增强有效抑制内容失真。

Qualitative Results

Takeaway

内容-说话人-情感三元特征联合解耦+对抗训练正交约束是零样本情感迁移的有效策略。端到端VITS框架消除了级联系统的特征分布偏差问题,四元特征(语义/说话人/情感/音高)融合通道实现了高质量的情感语音转换。

Citation

@inproceedings{zhen2025tzet,
  title={基于分层解耦的无文本零样本语音情感迁移},
  author={甄怡宁 and 王春玲 and 杨昊田 and 王少荣},
  booktitle={中国多媒体大会(ChinaMM 2025)},
  year={2025}
}